iT邦幫忙

2026 iThome 鐵人賽

DAY 23
0

誰握著前沿模型上線前的最後一道門?

[[我也希望安全第一]]|第 23/30 天

行為準則寫得再清楚,也還不是一道門

Microsoft 在 9 月公開 AI 行為準則,把不得攻擊系統、協助核武、製作深偽,以及不得欺騙人類或逃避關閉寫成紅線。這比一句「負責任地發展 AI」具體很多,但讀到這裡,我還是不知道一件事:模型踩線時,誰能真的擋下發布?

一份準則可以拿來訓練、寫測試,也可以在事故後作為追問依據。它自己沒有權限停掉 release pipeline。若同一家公司決定測什麼、看到什麼、如何解讀,最後又決定是否照常上線,這比較像一把由屋主自行保管鑰匙的鎖。

前面一直在問「哪一道防線應該攔住 Agent」。從這篇開始,問題往外移一層:誰有資格判斷那些防線夠不夠?

OpenAI 新成立的數學顧問小組剛好提供一個容易混淆的對照。九位數學家不支薪,可以主動提出建議、管理成員,也能公開表達意見;但 OpenAI 與合作的高等研究院都說得很清楚,小組不能決定公司的研究方向與發布節奏。這是一個有發言權的諮詢機制,不是一道能踩煞車的門。

這種安排並非沒有價值。外部專家能提醒公司別把「解決超過一百個開放問題」當成已經逐題驗證,也能把學界的署名和同行審查規範帶進討論。只是評估一個治理安排時,不能看到「外部專家」四個字就自動補上停止權。

四道門看起來相似,權力差很多

OpenAI、Anthropic 與 Google DeepMind 在 2026 年討論共同安全機制、第三方評估與產業標準。合作有價值,因為災難性風險不會尊重公司邊界;可是三家競爭者一起決定何謂安全,也可能把市場准入規則握在少數公司手上。

把幾種常被混稱為「外部監督」的做法排在一起,差異會比較清楚:

關卡 能看到什麼 能不能擋發布 能不能自行公開 主要破口
外部顧問小組 公司提供的成果與議題 通常不能 依章程,可能可以 有建議權,沒有資料存取或停止保證
公司行為準則與內部 gate 內部資料最多 可以,由公司自己決定 公司決定 商業時程同時影響判斷
Embedded evaluator 依契約取得 checkpoint、logs、員工訪談 通常只能建議 取決於 NDA 與審稿權 時間不足、付費關係、auditor shopping
法律認可的獨立驗證組織 法規要求的資料與測試範圍 依制度可能觸發限制 依通報與公開規則 認證品質、資源與程序設計
政府發布審查 可依法要求提交的材料 可以延後或限制 受保密與行政程序限制 專業容量不足、標準不明與政治介入

「第三方」只回答評估者不在原團隊,不代表獨立。真正要看的是資訊權、時間、資金來源、停止權和公開權。

進駐公司,不代表拿到整棟樓的鑰匙

Embedded evaluator 的想法,是不要等模型完成後才拿到一個 API,而是在訓練期間比較不同 checkpoint、檢查 reward environment、閱讀 transcript 與內部紀錄,甚至訪談員工。這能抓到完成版 benchmark 看不到的變化,例如模型何時開始辨識評估、何時學會隱瞞。

過去的限制也很具體:Hugging Face 事件的外部調查大約只有一週;Apollo Research 測 Astra 時只有三天,並提醒在模型可能辨識 eval 的情況下,低失準率不是很強的安全證據。

9 月 18 日,Anthropic 又宣布與 Accenture 合作 embedded evaluation,聲稱評估者將取得接近員工的存取,雙方並預計各自投入至少 10 億美元、為期五年。這使構想往實際合約前進一步;Anthropic 也坦白,目前仍沒有一致的存取、報告與資助標準,而且第一批工作由受評公司直接出資。

錢由誰付不是唯一問題,卻不能假裝不存在。若評估者不能列出「哪些資料被拒絕」、報告發布前要由公司改稿,或公司能一直換到比較好說話的團隊,進駐再深也可能只是高級版顧問案。

上線前應該交付一份可驗證的 release packet

不論最後一道門在公司、驗證組織或政府手上,至少應看到同一份可追溯材料:

model_release: sol-2026-09
scope: [api, agent, cyber]
capability_evals:
  - domain: cyber
    dataset_version: cyber-eval-17
    result_hash: sha256:...
control_evidence:
  - control: egress_default_deny
    test_run: runner-test-884
known_failures:
  - id: MIS-27
    status: mitigated
    retest: retest-291
independent_review:
  evaluator: external-org-id
  access_denied: [customer_raw_data]
  report_url: https://example.org/report
release_owner: board-risk-committee
decision: staged_release

這不是要把模型祕密全部公開。重點是讓「我們測過了」可以一路追到測試版本、失敗案例、修補後重測、外部評估者實際取得的範圍,以及最後簽字的人。

政府審查同樣需要門檻。若主管機關只說「先送來看看」,沒有風險分類、回覆期限、異議程序與保密規則,企業得到的不是安全標準,而是一個不可預測的發布排隊系統。2026 年 GPT-5.6 被要求限制在少數核准對象,就暴露了這個制度真空。

最後一道門不該只有一把鑰匙

我不太相信存在一個全知的發布裁判。公司最懂模型,卻有上市與競爭壓力;評估者較獨立,卻仰賴存取和經費;政府有強制力,卻可能缺人、缺標準,也可能把安全和外交混在一起。

比較能工作的安排,是把權力拆開:公司負責產生證據,外部評估者能查核並公開限制,法律替重大風險設定最低義務,政府只在明確門檻下動用延後或限制權。任何一方說「相信」都不夠。

下一篇就看政府真的按下停止鍵後發生什麼。Fable/Mythos 的三週封鎖,剛好把技術判斷、程序正當性、商業競爭和地緣政治全部擠在同一件事裡。

本篇的鎖

  • 鎖是什麼:可追溯的 release packet、獨立評估、法定最低義務與有門檻的政府發布審查。
  • 想攔什麼:讓前沿模型在能力與失敗模式尚未被適當檢查時,只因公司時程而全面發布。
  • 破口在哪:公司自評有利益衝突;外部評估者可能拿不到資料或不能公開;政府也可能缺乏技術容量與明確程序。
  • 怎麼補:把資訊權、時間、資金、停止權與公開權分開寫清楚;每次發布保存測試、例外、拒絕存取與簽核證據。

參考與來源


上一篇
第 22 篇|「轉真人」之後發生什麼:兒少、心理危機與醫療 Handoff
系列文
我也希望安全第一——然後我們看看這些鎖是怎麼一個個被撬開的 共 23 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言